🏠 返回首页
开源精读 · AI_Agent_Book

《AI_Agent_Book》
知识笔记与高效学习指南

可解释、可验证、可复用的工程原则设计 AI Agent——全书只围绕一句话展开:Agent = LLM + 上下文 + 工具,也就是大脑 + 眼睛 + 手脚。十章从"如何构建 Agent"走向"如何提升 Agent 能力"。

10章正文 2大部分:构建 · 提升能力 40+带星级实验 10组开放思考题 开源配套代码仓库 ★~★★★难度分级
"Agent 是宇宙演化史上一种全新的存在:它能通过生成代码实现自举和自我进化,就像一个程序员编写了另一个程序员,然后新的程序员又能继续编写下一个。本书的使命,就是帮助你理解和掌握这种创造的原则。"—— 引言 · 作者李博杰(Pine AI 首席科学家)
10
正文 · 每章带实验与思考题
2部分
构建 Agent / 提升 Agent 能力
1个公式
Agent = LLM + 上下文 + 工具
100+
带星级实验 · 含配套代码
10
开放思考题 · 附录有参考答案
开源
正文 + 配图 + 配套代码仓库
PART 01 · 一页看懂这本书

一本书只讲一句话:大脑 + 眼睛 + 手脚

作者李博杰(Pine AI 首席科学家)在图灵《AI Agent 实战营》讲义基础上重构而成,核心公式贯穿全书。它有三个表达层次,对应三种读者语言;理解了它,十章内容就都有了坐标系。

Agent = LLM + 上下文 + 工具

🧠 实现层

LLM(大脑)负责思考与决策;上下文(眼睛)决定能看到什么信息;工具(手脚)决定能做什么事。三者缺一不可。

🗣 直觉层

上下文不只含环境与对话历史,还包括工具定义——Agent "看到"的信息里也有"有哪些手脚可用"。

📐 学术层(RL 映射)

LLM ↔ Policy(策略);上下文 ↔ Observation Space(观察空间);工具 ↔ Action Space(动作空间)

🏗️

第一部分 · 如何构建 Agent(第 1–6 章)

"看到什么、能做什么"的工程全景
  • 第 1 章 AI Agent 入门:真实产品 + 核心公式三层理解 + ReAct 循环 + 工作流→自主 Agent 编排光谱
  • 第 2 章 上下文工程:全书最关键一章——API 上下文结构、KV Cache、提示工程与注入攻防、Agent Skills、状态栏、上下文压缩
  • 第 3 章 用户记忆和知识库:跨会话记忆四种策略 + RAG 全技术栈 + Agentic RAG 与多模态记忆
  • 第 4 章 工具:五类工具设计 + MCP 与 Skill Hub + 工具太多怎么办 + 执行工具安全
  • 第 5 章 Coding Agent 与通用 Agent:代码生成是"元能力",文件系统是通用 Agent 的根基(OpenClaw 主线)
  • 第 6 章 交互扩展:异步事件驱动、语音、Computer Use、机器人——四类场景共享的系统原语
⚙️

第二部分 · 如何提升 Agent 能力(第 7–10 章)

评估 → 参数 → 经验 → 群体,四个层面扩展能力
  • 第 7 章 Agent 的评估:科学的评估方法论——环境、数据集、LLM-as-a-Judge、评估驱动选型、评估→改进闭环
  • 第 8 章 模型后训练:SFT(记忆)与 RL(泛化);"数据与环境比算法重要";奖励设计与单轮/多轮 RL
  • 第 9 章 Agent 的持续进化:把运行经验转为学习信号,选择知识/Prompt/程序/参数四种更新载体,受控发布
  • 第 10 章 多 Agent 协作:上下文共享/独立 × 对等/管理者/去中心化的分类框架,走向 Agent 社会
  • 第 9 章是"构建 → 长期变好"的汇合点:没有前六章的轨迹、知识与代码能力,经验无处沉淀
📖

引言给的三种读法,先对号入座

本书章节相对独立,按你的身份选路线,不必从头平推:

  • Agent 开发者:按顺序通读,1–6 章建方法论,7–10 章学能力提升
  • 时间有限:只读第 1 章(全局认知)+ 第 2 章(最关键的上下文工程)
  • 关注模型训练:直接读第 8 章,并配第 7 章评估 + 第 1–2 章打底
  • 前置要求:Python + LLM 使用经验 + 一款 AI 编程工具 + 软件工程常识
  • 补课推荐:Transformer 基础可读《图解大模型》(第 2、8 章用得上)
PART 02 · 逐章知识地图

十章笔记:从"造一个 Agent"到"让 Agent 持续变好"

每一章都是可独立阅读的工程模块:第 1–6 章构建单 Agent(公式、上下文、记忆、工具、代码、交互),第 7–10 章提升能力(评估、后训练、进化、多 Agent)。展开卡片可查看逐节要点与核心术语,★ 为章节实验难度。

1
AI Agent 入门 · 全书总纲
一个公式、三个层次、五类产品、一组循环——先建立"大脑 + 眼睛 + 手脚"的完整坐标系,再谈工程。
实验 1-1~1-410 思考题
核心公式
Agent = LLM + 上下文 + 工具,即"大脑 + 眼睛 + 手脚"。学术层映射为 Policy(策略)+ Observation Space(观察空间)+ Action Space(动作空间);"+"是工程组合而非形式化定义,且公式不含环境 Environment。
产品直觉
Manus 靠"取虚拟浏览器 + 代码执行/命令行观察与动作空间之并集"成为通用 Agent;OpenClaw 把接口延伸到二十余种消息渠道、本地优先;Cursor / Deep Research / Browser Use / 手机助手 / 个人办事 Agent 五类产品都可用"感知–策略–动作"三维对比。模型固定时,扩观察与动作空间是主要能力杠杆。
三大组件
工具分五类(感知 / 执行 / 协作 / 事件触发 / 用户沟通);上下文 = 静态前缀(系统提示词 + 工具定义)+ 动态轨迹(用户消息 + 模型回复 + 工具结果);LLM 负责理解–规划–执行,其独特能力是行动前"内部思考"。
实验 1-1 ★★
对上下文四组件做消融:缺工具定义→给出"格式工整、语气笃定"的假答案;缺工具结果→盲目重试耗尽预算;思考过程可从工具结果重建、几乎无代价;历史消息防重复犯错。给出了回答 ≠ 完成了任务。
ReAct 循环
思考 → 行动 → 观察 → 继续,直到完成。轨迹(trajectory)= 累积的消息历史;完整上下文 = 静态前缀 + 轨迹。最小骨架:模型只决策、Harness 组装上下文并执行工具
Harness 工程
生产形态:Agent = Model + Harness,Harness = 上下文管理 + 工具接口 + 约束 + 验证 + 纠正。行业正从"能做事"转向"可靠地做事"——LangChain 只改 Harness(自动检查结果、检测重复循环)就把 Terminal Bench 得分 52.8% → 66.5%。
范式演进
提示工程 → 上下文工程 → Harness 工程 → Loop 工程 → Graph 工程(2026.7 起显式执行图)。Agent 学习三层次:上下文适应 / artifact(外部产物)更新 / 训练周期参数更新,时间尺度递增。
护栏与编排
护栏按被绕过难度分三层:上下文层(分类器/来源标记)→ 执行层(风险评级/人在回路)→ 数据层(行级安全)。从工作流到自主 Agent 按需升级:合规流程用工作流保可靠、开放问题切自主,混合形态"先由 Agent 写工作流再由其执行"。
核心术语Agent/EnvironmentModel-HarnessReAct轨迹 trajectory工具调用ACI防呆 Poka-yokeLoop/Graph 工程提议者-审核者渐进式披露只增不改边界集+保留集护栏三层MoE
2
上下文工程 · 全书最关键的一章
上下文质量决定 Agent 能力上限:API 消息结构、KV Cache、提示工程与注入攻防、Skills、状态栏、压缩。
实验 2-1~2-109 思考题
核心论点
上下文的质量才是 Agent 能力的真正关键——中等模型配精心组织的上下文,胜过顶级模型在信息匮乏下摸索。"AI Agent 就像一个永远的新员工:给足背景能干好,否则再聪明也白搭。"
API 结构
四种消息角色:system(最高优先级)/ user / assistant(含 tool_calls)/ tool(经 tool_call_id 关联);工具定义在顶层 tools 字段。最简 Agent 就是一个管理 messages 列表的 while 循环:无 tool_calls 则输出并 break。
KV Cache 三结论
① 系统提示词与工具定义定下就不改(多一个空格都破坏缓存);② 动态信息永远追加到末尾(时间戳/用户状态作新消息);③ 用标准 API 格式、别自行拼 USER:/ASSISTANT:(Chat Template 偏离即削弱思考)。位置偏好 Lost in the Middle:关键信息放首尾。
提示工程
流程驱动(SOP 分步)优于规则堆砌;工具描述写"何时用 + 边界条件";业务规则要细化到可执行;Few-shot 给 2–3 个高质量示例。实验 2-4:打乱信息组织 → 成功率降 >30%,删除工具描述 → 错误率 +45%。
提示注入
本质是借外部内容把伪装指令混入上下文。上下文层防御 = 帮模型分清指令与数据:来源标记(<external_content source=…>)、严守角色体系、输入清洗。上下文层只是第一道防线,执行层(权限/沙盒)才是兜底。
Agent Skills
按需加载对抗提示词膨胀:渐进式披露三层——元数据(SKILL.md + name/description 常驻)→ 正文(斜杠命令或 Skill 工具触发时注入)→ 子文档/脚本(按需深入)。description 是路由钥匙,写"何时用 / 何时不用"而非功能介绍。
Agent 状态栏
把分散在 KV Cache 的隐式状态提炼为显式知识:以一条 <agent_status> 的 user 消息追加到末尾(不毁缓存、获高注意力)。五种技术:时间戳 / 工具调用计数器 / TODO 列表 / 详细错误信息 / 系统状态感知——实验 2-9 成功率 60% → 95%。
上下文压缩
三动机:长度成本、提升思考质量、缓解"上下文焦虑"。与 KV Cache 看似矛盾实则互补(压缩发生在两次调用之间,System/Tools 永不动)。生产级五层:预算控制 → 删噪声 → API 微压缩 → 归档式摘要 → 全量压缩。上下文感知压缩省 token 75% 以上。隔离优于压缩——把大体积中间信息交给子 Agent,只回传结论。
核心术语消息角色Chat TemplateKV CachePrompt CacheLost in the Middle注意力储存池Few-shot提示注入SKILL.md渐进式披露Agent 状态栏上下文腐化上下文焦虑归档式摘要熔断器子 Agent 隔离
3
用户记忆和知识库 · 懂你的助手 + 领域专家
跨会话用户记忆四种格式、RAG 全技术栈、超越扁平文本的索引、Agentic RAG 与知识更新治理。
实验 3-1~3-12约 9 思考题
两个尺度
用户记忆(单用户个性化,偏好/习惯/需求)+ 知识库(共享集体知识,法规/流程/文档)。提取事实须满足:选择性、抽象化、结构化
评估三层次
先立标尺再设计:第一层基础回忆 → 第二层多会话检索(两辆车问哪辆、区分已生效合同)→ 第三层主动服务(订国际航班主动发现护照过期)。记忆分三类:轨迹(不可变流水账)/ 用户长期记忆(档案)/ 业务状态。
四种存储格式
渐进式递进:Simple Notes(最小事实,O(1))→ Enhanced Notes(整段上下文)→ JSON Cards(类别→子类→键值)→ Advanced JSON Cards(backstory / person / relationship,解决"多位张医生"消歧)。实践:关键少量用 Advanced、大量非关键用 Simple、多数生产为混合。User as Code 更进一步把状态做成带类型可执行对象。
认知基础
情景记忆(具体事件)/ 语义记忆(一般知识)/ 程序记忆(行为流程)三分类与 Agent 一一对应;工作记忆 = 上下文窗口。案例:Mem0(写入时消歧 → v3 仅追加 + 混合检索)、Memobase(槽位用户画像)。
RAG 管道
分块(固定 / 递归结构感知 / 语义切分)→ 稠密嵌入(BERT/BGE-M3,注意一词多义)+ 稀疏(BM25,精确匹配)→ 混合检索 → RRF 融合 + 跨编码器重排。质量指标:recall@k / MRR / nDCG。单一检索策略无普适赢家,三者组合才是生产级。
超越扁平文本
黑猫白猫计数与 Xfinity 优惠边界两案例说明"原始案例直接入库不够"——须在索引期投入计算提炼。RAPTOR(递归摘要树,适合概念→细节)与 GraphRAG(实体-关系图,适合 A 与 B 什么关系、实体消歧)互补;OpenViking 文件系统范式用目录 + L0/L1/L2 按需加载组织知识。
知识如何更新
把知识库当代码库,变更 = PR:Proposer 提交小 diff、Reviewer 独立审核(异源互审、证据三层分离:原始证据层 / 知识层 / 服务层);周期全量整理须回原始数据核查、冲突场景化而非删除。
Agentic RAG
把知识库变成随时可调用的工具,ReAct 多轮迭代——分解查询 → 评估信息是否充分 → 精化再搜。价值是"解决问题"而非"回答问题"。安全上检索文档是间接提示注入最典型载体。上下文感知检索(索引期给块加前缀摘要)检索失败率降 49%,再加重排降 67%;双层记忆架构(Advanced JSON Cards 常驻 + 上下文感知检索按需)让"主动服务"首次工程落地。
核心术语LoCoMo轨迹Advanced JSON CardsUser as Code情景/语义/程序记忆ChunkingBM25RRF重排序RAPTORGraphRAGOpenViking L0/L1/L2Agentic RAGContextual RetrievalMem0/MemobaseUser as Engram
4
工具 · Agent 的手脚
五类工具、ACI 与通用执行器、MCP 与 Skill Hub、工具爆炸三解、从输入验证到 Sidecar 的安全体系。
实验 4-1~4-5≈8 思考题
五类工具
按"调用方向 × 作用对象"分:感知(web_search/fetch_url/read_file…)、执行(shell/code_interpreter/write_file/send_email…)、协作(spawn_subagent…)、用户沟通(reply/send_card…)、事件触发(set_timer/monitor/connect_channel,注册 + 触发两个时刻)。设计总原则:工具应对应 Agent 的目标而非底层 API(ACI,Agent-Computer Interface)。
形态谱系
专用工具(schema 约束、确定性高,数百 token/个)→ Skill(自然语言流程,目录仅几十 token)→ 通用执行器(默认取向):与其给四则计算器不如给装 numpy 的 code_interpreter。四种情况退回专用工具:安全权限审计 / 屏蔽平台差异 / 使用频率极高 / 参数结构复杂
描述的艺术
让 LLM 知道"什么时候用"而不只是"能做什么";边界条件比能力更重要(做不到什么、不接受什么);参数用具体例子;每个工具附 1–5 个真实调用示例(工具调用准确率 72% → 90%)。Agent 频繁选错工具 → 先查工具描述,别急着换模型
参数保真性
禁止静默输入转换(弯引号被悄悄转直引号导致 edit 反复失败)与静默参数注入。"模型感知的世界与工具操作的世界之间不能存在系统性偏差。"
生态
MCP(客户端-服务器、stdio / Streamable HTTP、工具/资源/提示模板三类原语)一次开发处处可用;Skill Hub(skills.sh、ClawHub)是注册表而非协议,token 便宜一两个数量级。第三方能力三风险:工具描述投毒 / 恶意服务器 / 同名工具遮蔽
工具爆炸三解
① 层次化组织 + 按需加载(只暴露索引,Cursor MCP 任务 token −46.9%);② 主动工具发现(MCP-Zero 两层语义路由,~2800 工具省 ~98% token,新 schema 追加到上下文末尾不毁缓存);③ Skills 渐进式披露——"把'选哪个工具'变成'查哪条资料'"。
多模态三路线
原生多模态(ViT 视觉编码器,上限最高)/ 提取为文本(OCR/转写,最省 token)/ 工具化多模态分析(analyze_image 等,主模型不支持时的更优解,上下文只留问题与结果)。
执行安全体系
层次化:输入验证(快速失败,不做"智能"修正)→ 权限控制 → 提议者-审核者(事前审批用异族相近模型、事后验证靠模态切换)→ Sidecar 门控(只读结构化字段 {tool, command} 堵住话术通道、流式并行几乎无感)→ 执行-验证-反馈闭环(写后跑 linter)→ 沙盒分层(进程级 / 容器 / microVM)→ 幂等性 + "预检-确认"两段式(发邮件/转账无法幂等)。
核心术语ACI通用执行器元能力MCPSkill Hub工具遮蔽MCP-Zero渐进式披露Sidecar提议者-审核者模态切换幂等性沙盒/容器/microVMHITL认知多样性
5
Coding Agent 与通用 Agent · 代码是元能力
Coding Agent + 文件系统 = 通用 Agent 的技术根基;七个工具、Harness 四组件、故障恢复与自举。
实验 5-1~5-169 思考题
核心论点
Coding Agent + 文件系统是开放任务型通用 Agent 的架构核心(Manus / OpenClaw 同循此范式)。代码是元能力:思考上规则写成代码即无歧义,表达上"能跑通的代码本身就是逻辑自洽的证明",执行结果给出客观对错标准。
七件套工具
Code Interpreter / Bash / 读文件 / 写文件 / 编辑文件(迭代核心)/ Glob / Grep 即可支撑典型任务(Codex 仅一个 Bash 也行)。文件系统是信息中枢:MEMORY.md + 按日 Markdown 日志,选纯文本弃向量库——用户可读可改、天然时间序、Git 可回滚。
Harness 四组件
验收基线(测试/CI)/ 执行边界(模块/依赖/权限)/ 反馈信号(linter/类型错误)/ 回退手段(Git/沙盒)。Coding 成熟度高的真因:软工几十年基础设施天然构成 Harness,而非代码模型特别强。四条原则:约束优先于指导、验证要自动化、反馈越快越结构化越好、回退要可靠。
故障恢复
故障四层:API(限流/超时)/ 工具(幻觉调用/同错反复)/ 上下文(溢出/轨迹缺配对)/ 控制流(死循环/死亡螺旋)。恢复分级:静默重试(退避+抖动)→ 降级接续 → 暴露用户;轨迹存中立格式(文字与凭证分离)以便接管、评估与重放。
实现技巧
并行工具调用 + 级联中止;输出附行号标注供精确引用;环境信息以状态栏注入;持久化终端会话(保留 cd/venv);文件写入后自动跑 linter。文件编辑五案对比:Claude Code/Codex 采用 old→new 字符串替换(可预测透明)。
安全
Simon Willison"致命三要素"(私有数据 / 不受信内容 / 外部通信)+ 本书补第四维:持久记忆(恶意指令写进记忆跨会话潜伏)。命令用语义解析而非关键字黑名单($(echo rm) 可绕过字符串匹配);沙盒默认断网、白名单出口、凭证不挂载;还要处理委托方忠诚问题(砍价 Agent 不能"太老实"也不能"太多疑")。
元能力六方向
① 思考工具(LLM 转形式化语言交给 SymPy 等精确求解);② 业务规则代码化(τ-bench 的 checklist 参数 + 服务端数据库真值校验为真守门);③ 多媒体生成(PPT/视频用提议者-审核者 + Vision LLM 结构化改进);④ 系统适配器(无接口 → 生成适配代码 / Computer Use 固化 RPA);⑤ 生成式 UI(A2UI 声明式协议只出 JSON"界面清单",SQL 用 Artifact 模式,信任边界下移到数据层——即使 AI 写错权限也无法被绕过);⑥ Agent 自举(doctor 分层:确定性检查 + LLM 兜底,"Agent 修复 Agent")。
核心术语Coding Agent文件系统中枢元能力七件套CLAUDE.mdHarness 四组件死亡螺旋中立轨迹致命三要素提议者-审核者Artifact 模式A2UI/AG-UI服务端真值校验信任边界下移自举 bootstrap
6
交互:观察与动作空间的扩展 · 从回合制到实时世界
异步事件驱动、语音、Computer Use、机器人操作——四类时间尺度共享"唤醒/安全点/取消/抢占/快慢分离"原语。
实验 6-1~6-1312 思考题
核心论
扩展两空间的模态(能听声/看屏/感知力矩)与触发时机(主动取 or 被推送、可打断)。"回合制是训练留下的假设,不是环境的性质。"
异步与事件驱动
训练同步 / 部署异步是根本矛盾 → 事件循环架构,事件只在安全点(推理结束/工具返回)消费。三种策略:取消式(紧急:停当前、清队列、立即重调 LLM)/ 队列式(常规:入队待工具返回批量追加)/ 并行式(独立轻量查询另起会话)。事件须结构化建模(来源/渠道/内容),否则易把藏指令的工具结果误当用户指令。
用户沟通与身份
OpenClaw 用专门工具发消息(可附图/推送),多渠道即召回机制;Agent 应有虚拟身份隔离部署(被攻破不牵连用户账号),访问真实账号须 HITL。"主动服务不仅要 Agent 定时查事件,更要事件主动通知 Agent。"
语音
说话约四倍速于打字。三路线:级联(VAD→ASR→LLM→TTS,模块清晰延迟累积)/ 端到端 Omni(保语气情绪,训练贵)/ 全双工(Moshi 可重叠说话)。工程要点:流式感知(各阶段出增量 + 声学事件标记)、快慢思考分离(快模型维持话头、慢模型后台深推)、控制标记 TTS(THINKING/EMO/SPEED 映射为停顿韵律)。
Computer Use
感知-思考-行动循环(截屏→动作→再截屏),要区分"看懂界面"与"完成任务"。视觉定位三法:Set-of-Mark(SAM 切区编号)/ DOM 结构化元素索引(稳但费 token)/ 纯坐标预测(注意训练分辨率与宽高比)。观察接口(AOI)用关键帧 + 音量门控转写;世界模型预测"动作后现实是否与计划一致"——"准确率达到人类水平 ≠ 足够实用"。
移动端生态壁垒
技术上可接无障碍服务 API,真卡住的是结构性利益冲突:App 靠流量与注意力变现,Agent 直奔目标绕过变现链,故遭封杀——不是纯技术对抗。
机器人(XLeRobot)
廉价臂证明硬件不是瓶颈、算法才是。控制层级:任务目标 → 长程规划 → 基本技能(pick/place)→ VLA(1–10Hz)→ 底层安全层;模型只选有界技能、失败只重试当前步、执行后立即重观察。动作分块(一次生一小段未来动作由控制线程回放)取舍平滑性与反应速度;Sim2Real 需领域随机化与真机标定。
核心术语事件循环安全点虚拟身份Hooks/Cron/Heartbeat级联/Omni/全双工VAD流式感知快慢思考分离MGRD/MPSSoMAOI世界模型VLA动作分块Sim2Real共享原语
7
Agent 的评估 · 科学方法取代"炼金术"
一条任务的解剖、Pass@k 与 Pass^k、评估数据集、LLM-as-a-Judge、失败归因、可观测性与仿真环境。
实验 7-1~7-149 思考题
评估对象
模型与 Harness 的组合体,而非模型本身。三种基础实验:对比 / 消融(组件贡献)/ 模型替换(固定 Harness 换模型——分数不动 = 瓶颈在 Harness)。评估四环节:什么算成功 / 任务从何而来 / 由谁验证 / 分数如何转成决策。
任务解剖 τ²-bench
任务 = 工单 + 用户模拟器行为规范 + 初始状态 + 评分标准。四设计要点:渐进式信息透露(known_info 建模用户认知边界,故障原因须提问才暴露)、事实锚定(模拟器设备状态必须以工具返回为依据)、双方都不具备完全信息、多维校验(env_assertions/actions/communicate_info)。
指标口径
Pass@k / Best@k 衡量"能否偶尔创造奇迹";Pass^k = p^k 衡量"能否稳定可靠交付"——p=0.6、k=5 时 Pass@5≈99% 而 Pass^5≈7.8%,支付/退款/权限变更必须看 Pass^k。报告须写清 k 的口径。
环境与数据集
环境五要素:数据集 / 可重置状态 / 工具接口 / 评分标准 / 执行协议。两范式:工具调用型(Verifiers)vs 人机交互型(需用户模拟器)。数据泄漏防范:参数化模板动态实例化(AndroidWorld)、canary GUID(Terminal-Bench)。评估集三来源:公开基准(只粗筛)/ 自建业务集(作决策)/ 生产轨迹回流(成本最高、准确性最高)。
自动化评估
能写断言就用断言(确定性验证器),开放式任务沿谱系右移:Rubric + LLM-as-a-Judge + 失败归因。Rubric 四准则:专家指导 / 全面含陷阱 / 加权 + 一票否决(幻觉即否决项)/ 自包含可操作。同源模型有古德哈特定律风险 → 多源异构评判。防位置偏差:交换顺序各评一次。
失败归因
定位首个导致任务偏离的错误(后续是连锁反应),勿把最后报错当根因。典型盲区案例:Agent"做对了但说错了",根因是观察通道缺失(Harness 问题)却常被记成模型能力问题。回归任务两层:端到端 + 轨迹前缀回归(冻结首错前上下文,只验证那个决策边界)。
选型与成本
吞吐/延迟(TTFT、Decode、p95)/ 成本(低成功率模型因重试可能更贵)/ 性能(Pass@1 vs Pass^k vs Pass@k)。上下文累积效应:每轮重发全部历史,成本超线性增长。几项上下文优化(稳定前缀、压缩)须一起实测——各自节省不可相加。
统计与改进
标准误 SE≈√(p(1−p)/n);同批比较用配对分析(McNemar / 配对 bootstrap)。AndroidWorld 三轮案例:补提示词 25%→25%(失败)、换 UIAutomator 元素树 25%→100% 但 token 2.5×、裁剪无用节点 100% 且 token 0.51×——"先检查输入而非堆提示词"。核心方法论:观察 → 假设 → 实验 → 验证;可观测性(Trace/span/OpenTelemetry)与内部评估基础设施(消融开关/AB 测试/特性开关/提示词敏感性);仿真环境是评估到后训练的桥梁(RLVR、reset 语义、领域随机化)。
核心术语Pass@k/Best@k/Pass^kmodel swap消融τ²-bench双控事实锚定LLM-as-a-JudgeRubric/Veto古德哈特定律失败归因轨迹前缀回归Elo/Bradley-TerryMcNemarOpenTelemetryRLVR领域随机化
8
模型后训练 · 优化"大脑"
预训练→Mid-training→SFT→RL 四阶段、底座/协议/策略三判断、奖励设计、RL 算法直觉与蒸馏。
实验 8-1~8-1913 思考题
全景
四阶段:预训练(能力地基,最贵)→ Mid-training / CPT(补目标领域"教材章节")→ SFT(固化格式/风格/流程等协议性知识,便宜快稳)→ RL(自己试错应对未见场景,代价常为 SFT 的 10–100 倍)。类比:通识教育 → 研修教材 → 示范答题 → 下场做题。两条主线:① "SFT 记忆、RL 泛化"是受控实验测得的结果而非普遍属性;② 数据和环境比算法更重要
何时选哪个
三问:缺底座(概念不会且 pass@k 近零)→ Mid-training(动态事实用 RAG);缺协议(会做但格式/流程不稳)→ SFT 或约束解码;缺策略(有非零成功率 + 可靠奖励但泛化不足)→ RL。四步决策:先排除不改权重的方案(prompt/工具/约束/RAG)→ 留出集测 pass@1/pass@k → SFT 立协议不硬塞知识 → 有探索空间才上 RL。LoRA 是工程默认项(参数 1–5%、近全参效果)。
单轮 RL 对照
GeneralPoints(卡牌算术 OOD):RL +17.6% vs SFT −9.9%——RL 强化"重算到对"的可迁移策略,SFT 过拟合固定模式;验证迭代越多泛化越好。AdaptThink:RL 学会"简单题不输出思考",精度略升、响应长度 −47~68%。
算法直觉
GRPO 四步:同一任务 16 份独立 rollout → 验证器给 0/1 → 算组内相对优势(全 0/全 1 优势消失)→ 梯度更新,一次 step ≈2600 秒。PPO 带价值网络、适合长轨迹细粒度信用分配;DPO 离线学偏好对。on-policy ≠ online;sampler/trainer 浮点差异致 log prob 失配会让 on-policy 悄悄变 off-policy(长序列 e⁴≈55 倍放大)。
RL 环境
瓶颈常在环境是否真实/可重置/可并行——仿真像不像真实世界比选 PPO/GRPO 更重要。造不出环境就用模型扮演(ZeroSearch 扮搜索引擎、τ-bench 扮用户);训练与评估可共享代码但不可共享同批任务
奖励设计
RLVR(可验证奖励)最可靠,二元起步;reward hacking(钻规则漏洞)vs reward seeking(建模"评判器看什么")——"通过 grader ≠ 任务完成"。ORM 简单稀疏 vs PRM 细但限缩路径;RLVP = 奖励结果、惩罚路径(R=O+βΦ),针对可判定的中性约束恢复组内差异。TerminalBench 违规 3.71→0.66 而成功率持平。
蒸馏
样本效率:RL 一条 rollout 只给一个 0/1,On-Policy Distillation 把它变成逐 token 密集监督(学生决定走到哪里、教师给完整概率分布),数学任务步数 ≈ 纯 RL 的 1/10;时间感实证比同源 SFT 高 23–47pp。无强教师用 OPSD 在轨自蒸馏。CoT 蒸馏可恢复教师 70–80% 能力(须防"思考围墙",选开源教师)。
实践要点
问题案例→训练映射:端到端回归→RLVR/RFT;轨迹前缀→DPO 偏好对。11 个陷阱:SFT 硬塞知识、格式未稳上 RL、标称窗口≠有效窗口、p@k 近零直接 RL、奖励不当、仿真失真、过训、数值失配当小噪声、低估 RL 成本、数据质量低……先小规模验证,快速失败优于大规模失败
核心术语Mid-training/CPTSFT/RLloss maskingLoRApass@kRLVRPPO/GRPOon-policyreward hackingORM/PRMRLVPOn-Policy DistillationOPSDRFTCoT 蒸馏信用分配
9
Agent 的持续进化 · 从聪明到熟练
三类学习信号、四层更新载体、双循环闭环、自我修改治理、睡眠学习与不可自我修改的安全边界。
实验 9-1~9-96 思考题
能力悖论
Agent 能零样本解决从未见过的难题,却可能处理一万次相似任务后仍犯第一天的错误。关键区分:保存经历 ≠ 从经历中学习——学习发生在系统主动完成"评价、对照、归纳、验证"之后。本章构建模型外围可验证的学习系统(持续进化),区别于权重层面的持续学习。
三类学习信号
环境结果(测试/状态,最可靠)> 过程规则(业务规则/权限/动作序列)> LLM Rubric(逐项给分 + 引用证据 + 不确定就明说)。三层验证结构:结果验证器(事是否办成)→ 过程验证器(是否以允许的方式)→ 质量验证器(是否办得合适),越往下越依赖代码与环境真值。
四层更新载体
按能力的表示性质选择:经验知识库(事实/规律,快可追溯)/ Prompt 与 Skill(判断原则,可解释)/ 程序与 Harness(可验证硬约束,稳廉)/ 模型参数(高维感知/风格/隐式策略,泛化强但贵)。医疗影像、语音韵律、"去 AI 味"等只能进参数。
知识提炼五步
不可变轨迹 → 单次结构化分析 → 按任务族聚合证据表 → 达门槛写入正式文档 → 新任务验证迁移。τ²-bench 案例三条洞察:提炼材料决定归纳质量(缺工具清单只能归纳出教训);模型会把观察到的行为当作应然的行为(轨迹里最常见是转接人工 → 被写成兜底规范)→ 产物必须独立验证;被修复的往往是极朴素缺陷。
经验写成程序
浏览器工作流生命周期:捕获(带定位证据)→ 参数化 → 动作前/后 + 最终状态检查 → 独立回放验证 → 匹配回放(Playwright 直执)→ 失效重学。PreAct 重复任务加速 8.5–13 倍,但缺回放验证会出现"每个按钮都点了但字段为空"的假象。自我修改 = Git worktree + PR 的可审计发布流程,修改请求是可证伪的变更契约。
元层优化
优化对象从"单条规则"逐层扩大到"上下文 → 工作流 → Harness → 产生提案的优化器代码"(五种搜索尺度)。DeepSeek Harness"一切皆插件":核心论断——自我进化的上限取决于系统可组合性,而非模型写代码的能力
双循环闭环
在线执行循环只完成任务并记录证据,不直接改写正式 Agent;离线进化循环聚合轨迹 → 诊断根因 → 生成提案 → 过门槛发布。Voyager 三机制(自动课程 / 技能库 / 迭代提示)缺一不可。评估四层:提案有效率 / 产物激活率 / 遵循成功率 / 保留任务集增益——长期看回退、泛化、token 效率、安全性、工程质量五类结果。
安全边界与睡眠学习
三道防线:① 证据与指令隔离(网页/工具输出是证据不能当指令);② 待验证与正式能力隔离(沙盒/扫描后进);③ 安全机制不可自我修改——业务 Agent 不能改自己的验证器、测试用例与发布门槛,"真正的保证必须来自被修改者无法触及的那一层"。睡眠学习:在线只追加不可变证据,空闲期批量读取、比较、合并、提案、回归(触发→定向→采集→验证→修剪)。
核心术语持续进化三层验证结构Rubric 信号系统提示学习最小 diff+可回滚可证伪变更契约双循环发现循环时间/空间可组合性证据与指令隔离睡眠学习上下文腐化
10
多 Agent 协作 · 从个体到群体智能
两维分类框架、三种通信机制、对等/管理者/去中心化拓扑、A2A、失败模式与 Agent 社会。
实验 10-1~10-611 思考题
核心判据
只有一条:协作过程是否引入了单个 Agent 生成时无法获得的新信息(执行结果/渲染截图/外部工具验证)。这解释了"学术与工程的矛盾":多 Agent 看同一段上下文互相辩论(无新信息)≈ 单 Agent;RLEF 每次迭代引入真实编译错误则远超独立采样。
两维分类
维度一:上下文共享(继承完整轨迹,信息不丢但易膨胀、有角色惯性)vs不共享(隔离、模块化,靠通信交换)。维度二拓扑:对等(少量固定循环)/ 管理者(中心化调度)/ 去中心化(无中心控制)。不共享时的三种通信机制对应 IPC:工具调用参数 / 共享文件系统(共享内存)/ 消息总线(消息传递)。
虚拟文件系统
四类区域挂载同一目录树:Agent 专属工作区(Scratchpad,私有)/ 多 Agent 共享空间(协作产物主媒介,乐观锁/worktree 防冲突)/ 外部挂载(Drive/Notion 适配器,按需只读)/ 系统内置资源(Skills 等)。"文件路径作为通用接口"——Agent 间传轻量路径而非内容进上下文。
生命周期与控制
信封消息(发送者/类型如 task_assigned/result/terminate);状态用统一状态机词汇;优雅终止 vs 强制终止、沿创建关系级联取消(借鉴 Go context)杜绝孤儿 Agent。稀缺资源是 token 与并发额度 → 步数/token 预算、强弱模型分派、预算感知
Loop 工程
过早终止三形态:偷懒式假完成 / 过早放弃 / 假成功——"在验证之前,'完成'只是模型的一句宣称,不是证明。"模型可以提出"完成",但不能批准自己的"完成";循环的瓶颈在验证器。LongHorizon-Harness(Manage-Execute-Audit):PassRate 51.8%→80.7%。
对等与管理者
提议者-审核者:审核者读独立证据、不能修改测试与发布门槛(无外部反馈时自我修正会变差)。Plan-and-Act 实证:弱规划者是系统最关键瓶颈——把最强模型给 Manager 而非平均分配。翻译 Agent 实验:Glossary/Translation/Proofreading/Manager 四角色靠上下文隔离解决"上下文膨胀与迷失"。
去中心化
MetaGPT(共享消息池 + 按角色订阅,但控制流固定 = 伪去中心化)→ AutoGen 群聊(中心化调度的混合形态)→ OpenAI Swarm(handoff 真移交 + 环检测 + 预算保护)。编排(管理者)vs 编舞(去中心化)。跨组织用 A2A:Agent Card / 任务状态机 / 不透明协作——与 MCP 互补(Agent-工具 vs Agent-Agent)。
失败模式与 Agent 社会
MAST 14 种失败三大类(系统设计缺陷 / Agent 间对齐失败 / 任务验证缺失);Agent 故障天生拜占庭式(不停机但给可信的错误结论)。六模式:并发冲突(乐观锁/隔离分支)、错误级联(交叉验证)、同质趋同(30 个 Agent 18 个建同名分支,共因失效)、互相扯皮(更强执行 ≠ 更好协调)、循环失控、理解债与认知投降("你可以外包思考,但不能外包理解")。社会涌现:AI 小镇(25 Agent 自涌现派对)、Agentopia(100 Agent 模拟 10 年,最好 25% 轨迹可作训练数据)、市场机制(Pinchwork / RentAHuman)、狼人杀(中心化信息权限对照)。
核心术语上下文共享/隔离对等/管理者/去中心化消息总线虚拟文件系统级联取消Loop 工程预算感知提议者-审核者独立证据A2A/Agent CardMAST拜占庭故障乐观锁/worktree交叉验证共因失效理解债涌现
阅读小贴士:本书正文结构为"开篇论点 → 机制/案例 → 实验(★~★★★ 由浅入深)→ 思考题";附录《思考题参考答案》按章收录了 10 组开放题的精要解答,可在完成实验后用作自测对照。后记提出的"两朵乌云"(可靠性、自主进化中的未知)与"小世界/大世界假设",是读完全书后值得回头再读一遍的收尾。
PART 03 · 核心概念速查

18 张概念卡:一本书的高频词汇表

按"构建 → 提升 → 协作"的阅读顺序排列。每一张卡都能在正文中找到更完整的推导与实验支撑。

上下文工程 Context Engineering

系统性设计、组织、提供 Agent 完成任务所需的全部背景知识。上下文质量决定能力上限——"中等模型 + 精心上下文 > 顶级模型 + 信息匮乏"。

静态前缀 + 轨迹 Prefix + Trajectory

系统提示词与工具定义构成不变前缀;用户消息/模型回复/工具结果累积成动态轨迹。KV Cache 命中的前提就是"前缀字节级稳定,动态信息只追加末尾"。

KV Cache Key-Value Cache

缓存历史 token 的中间结果,避免每生成一个词都重算前文;前缀一改,首个不同 token 之后全部失效。它是"为什么提示词定下就别改"的底层经济学。

Agent Skills 渐进式披露

把领域知识封装为 SKILL.md:目录(name+description)常驻、正文按需加载、子文档深潜。description 是"路由钥匙"——写清何时用/何时不用,是最经济的上下文组织方式。

提示注入 Prompt Injection

攻击者借外部内容把伪装指令混入上下文。上下文层靠来源标记与结构化角色"帮模型分清指令和数据",但真正兜底在执行层的权限与沙盒。

Agent 状态栏 Status Bar

把"打了几次电话"这类分散在 KV Cache 的隐式状态提炼为显式知识,注入上下文末尾供模型"瞥一眼"。本质:上下文学习像检索,需要主动提供提炼后的知识。

RAG 检索增强生成

检索相关片段 → 注入上下文 → 生成。生产级管线 = 结构感知分块 + 稠密/稀疏混合检索 + RRF 融合 + 跨编码器重排;超越扁平文本还需 RAPTOR/GraphRAG 等索引期提炼。

Agentic RAG 智能体化检索

把知识库当成 Agent 可随时调用的工具,多轮迭代:检索 → 评估信息是否充分 → 精化查询再搜。价值是"解决问题"而非"回答问题"。

MCP 模型上下文协议

Anthropic 2024 发布的开放标准,统一模型与外部工具/数据源的通信(客户端-服务器,stdio/Streamable HTTP)。一次开发、处处可用;是"工具分发"的协议层。

ACI Agent-Computer Interface

工具接口应"对 Agent 友好而非对人友好":对应 Agent 的目标而非底层 API、命名参数直观、让错误在设计上无法发生(防呆)。

Harness 工程 马具

Agent 边界内、模型之外的运行与治理层:上下文管理 + 工具接口 + 约束 + 验证 + 纠正。"模型此刻的能力边界,就是 Harness 此刻的价值。"

提议者-审核者 Proposer-Reviewer

产出与评判由不共享上下文的两个角色承担,审核者只看独立证据(渲染结果/测试输出)。前提是自审不可靠——无外部反馈的自我修正甚至会更差。

Pass@k 与 Pass^k 成功率口径

Pass@k(k 次至少一次通过)衡量"能否偶尔创造奇迹";Pass^k(连续 k 次全过)才对应支付、退款、权限变更的业务可靠性。写报告必须说清口径。

Loop 工程 写循环而非写提示

设计"发现下一件事 → 执行 → 验证 → 记录进度"的循环,由验证器判定能否停止。"模型可以提出完成,但不能批准自己的完成——循环的瓶颈在验证器。"

后训练四阶段 Mid-training/SFT/RL

预训练建地基,Mid-training 补目标领域知识,SFT 固化协议性格式,RL 在试错中学会泛化。判断口诀:缺底座→Mid-training;缺协议→SFT;有成功率但泛化不足→RL。

RLVR 可验证奖励强化学习

把"评估环境的验证器"直接当作 RL 奖励函数——定义清晰的 Rubric/验证器,就是通向后训练的桥。可靠、可规模化,是"数据与环境比算法重要"的落点。

持续进化 四层更新载体

保存经历 ≠ 从经历中学习。按能力的表示性质选载体:知识库(事实)/ Prompt 与 Skill(原则)/ 程序与 Harness(硬约束)/ 参数(高维隐式能力),且"安全机制不可自我修改"。

多 Agent 判据 信息增量

要不要上多 Agent,只看一条:协作是否引入了单 Agent 生成时无法获得的新信息(执行反馈、视觉验证、外部工具结果)。否则多个 Agent 只是花更多 token 看同一段文本。

PART 04 · 高效学习方法论

六条方法:把"读了"变成"会用"

这本书信息密度高(10 章正文 + 100+ 实验 + 10 组思考题),平推容易"读了就忘"。下面六条方法专为"Agent 工程"这类动手型知识设计。

🧭

方法一 · 以公式为锚

每读一章先问:它挂在哪一个词上?第 1–6 章回答"Agent = LLM + 上下文 + 工具"怎么搭,第 7–10 章回答怎么让它变好。读第 2 章前先背下 KV Cache 三结论,读第 8 章先分清 底座/协议/策略——锚点清晰,细节才有地方挂。

🧪

方法二 · 先跑实验再读原理

本书配套代码仓库(github.com/bojieli/ai-agent-book),100+ 实验按 ★ 分级。建议顺序:先跑一个 ★★ 实验看现象 → 再回去读对应章节找解释 → 实验失败本身就是最好的教材。动手成本远低于想象的章节(如 2-1 本地小模型、3-5 手写 BM25)优先做。

🔍

方法三 · 上下文即力量

把第 2 章的结论直接用于你的日常:系统提示词定下不改、动态信息追加末尾、工具描述写"何时用 + 边界"。当你给任何 Agent/IDE 配置提词时都按这套纪律来,KV Cache 与注意力原理就内化成肌肉记忆。

🔁

方法四 · 三遍阅读法

第一遍 浏览:只读每章开篇论点 + 小结 + 金句,建立地图(约半天);第二遍 精读:按你自己的路线逐章读机制与案例,随手做术语卡;第三遍 重做:合上书,把每章的"一句话结论 + 三个术语"默写出来,写不出的回去补。

🧠

方法五 · 费曼转述与"书评"输出

每读完一章,用 300 字向"不懂 Agent 的朋友"讲清这章解决什么问题;再挑一个书中结论到真实项目里验证(例如给工具描述补边界条件、看调用准确率是否提升)。能转述 + 能验证才算真正掌握。

🛠

方法六 · 把书变成你的 Harness

最高级的学法是边读边改造自己的工作流:读完第 1 章给项目加 CLAUDE.md/AGENTS.md;第 2 章给 Prompt 做缓存纪律;第 4 章给工具写边界描述;第 7 章建一条评估轨迹;第 9 章把失败经验写成 Skill。让本书的工程原则直接长进你的工具链,书读完了,你的 Coding Agent 也升级了。

阅读节奏建议:全书两大部分之间是递进关系,但章节相对独立——可"2 章并行 + 1 个主线实验"交替推进(如第 2 章配实验 2-3、第 3 章配实验 3-8)。遇到不懂的数学/算法细节先跳过,作者的写作原则是"直觉优先、可运行代码验证",不要让符号挡住主干。
PART 05 · 分人群学习路径

三条路线,按你的身份对号入座

沿用引言给出的三种读法细化成可执行路线。每条路线都标注了每周的章节动作、要跑的实验与产出物;完成标志不是"读完",而是"跑通 + 讲清"。点击标签切换路线。

🛠️Agent 应用开发者 · 8 周完整通读
⏱️时间有限 · 最小精读集(约 2 周)
🎓关注模型训练 · 训练与研究向(4 周)
适用:想系统掌握 Agent 构建与工程化、并最终做出自己产品的开发者。节奏:每周 5–8 小时,书按顺序读,实验挑 ★~★★ 先做、★★★ 可后补。
1
WEEK
第 1 章 · AI Agent 入门

建立全局坐标系 主实验:1-1 ★★

  • 通读全章 + 小结,背诵核心公式与三层理解
  • 实验 1-1上下文消融,亲眼验证"假答案 > 报错"
  • 用"感知-策略-动作"三维分析你日常用的 2 个 AI 产品
产出:一张公式三层映射图 + 一段给同事的 3 分钟讲解
2
WEEK
第 2 章 · 上下文工程(全书最关键)

吃透"上下文 = 静态前缀 + 轨迹" 主实验:2-1 ★ / 2-3 ★★

  • 背下KV Cache 三结论并解释为什么
  • 实验 2-1本地小模型工具调用;实验 2-3看五种错误上下文管理模式的后果
  • 实操:重写你常用工具的 system prompt(动态内容全部移到末尾)
产出:一份"提示词缓存纪律"自查清单,贴到你的 IDE 配置旁
3
WEEK
第 3 章 · 用户记忆和知识库

让 Agent"记住你" 主实验:3-5 ★★ / 3-8 ★★

  • 精读四种存储格式与三层次评估框架
  • 实验 3-5手写 BM25(检索基础补课)、实验 3-8对比 Agentic / 普通 RAG
  • 选做 3-10 上下文感知检索(配合第 2 章原理)
产出:为你的助手实现一个"用户偏好 JSON 卡 + 检索"的最小记忆
4
WEEK
第 4 章 · 工具

设计 Agent 的手脚 主实验:4-1 ★★★ 可后置 / 4-4 ★★

  • 掌握五类工具与"通用优先、四种情况退回专用"
  • 实验 4-4搭执行工具 MCP 服务器(重点看安全体系:输入验证→审批→沙盒)
  • 把你一个真实工具的描述补上"边界条件 + 一个调用示例"
产出:一个带安全审查的执行工具 + 描述改写前后的对比记录
5
WEEK
第 5 章 · Coding Agent 与通用 Agent

理解"代码是元能力" 主实验:5-1 ★★★ 可后置 / 5-5 ★★

  • 精读七件套工具、文件系统中枢、Harness 四组件
  • 实验 5-5:小模型 + 代码化知识提升规则准确性(很直观)
  • 审视你的 Coding Agent:它的故障恢复与约束做到了第几层?
产出:给项目补齐 CLAUDE.md/AGENTS.md(若还没有),观察行为变化
6
WEEK
第 6 章 · 交互扩展

走出回合制 主实验:6-1 ★★★ 可后置 / 6-7 ★

  • 理解事件驱动 + 共享原语(唤醒/安全点/取消/抢占/快慢分离)
  • 实验 6-7体验 Computer Use、实验 6-1做事件驱动邮件 Agent
  • 语音/机器人两节可按兴趣快读(时间尺度不同、原理相通)
产出:一个"世界主动找上门"的最小事件驱动任务
7
WEEK
第 7 章 · Agent 的评估

从"感觉变好了"到"证明变好了" 主实验:7-3 ★★ / 7-6 ★★

  • 吃透 Pass@k vs Pass^k 口径、Rubric 四准则、失败归因
  • 实验 7-3搭 Rubric 评估系统;实验 7-6对失败轨迹做归因
  • 为你第 3–5 周的作品写 10 条用例(端到端 + 边界)
产出:你自己的"通过/回归用例集",从此每个改动都有据可依
8
WEEK
第 9 + 10 章 · 持续进化与多 Agent

收尾:让它变好、让它们协作 主实验:9-1 ★★ / 10-2 ★★

  • 第 9 章精读"四层更新载体 + 安全边界",跑 实验 9-1轨迹验证器
  • 第 10 章掌握一条判据 + 两种拓扑,跑 实验 10-2翻译 Agent 体验上下文隔离
  • 读后记,回看第 1 章公式——此时应有完全不同的理解
结课产出:一个带"记忆 + 工具 + 评估 + 一条经验沉淀"的完整 Agent
通关自测能徒手写出 Agent 核心循环伪代码,并说清 Model 与 Harness 各负责什么。
通关自测能解释"为什么动态信息不能写进 system prompt",并指出缓存破坏的代价量级。
通关自测能说出 Pass@k 与 Pass^k 分别该用在什么业务,以及"失败归因要找第一个错"。
通关自测能回答"什么时候才值得上多 Agent"——并用信息增量判据说服别人。
适用:已经在用 AI 编程/Agent 产品、只想快速建立正确心智模型的人。原则:第 1、2 章精读,其余章节"概念快读 + 摘结论",全程约 12 天、每天 1 小时。
D1-2
精读
第 1 章 · AI Agent 入门

只读这一章也能建立全局观 实验:1-1 ★★(强烈建议)

  • 公式三层理解 + 五类产品对比 + Harness 概念 + 编排谱系
  • 跑 1-1 消融实验,理解"上下文残缺 = 假答案"
产出:一页纸"Agent 是什么"速查
D3-6
精读
第 2 章 · 上下文工程

全书含金量最高的一章,值得 4 天 实验:2-3 ★★

  • KV Cache 三结论、提示工程、提示注入、Skills、状态栏、压缩
  • 跑 2-3 看五种错误上下文管理的现场翻车
产出:立即改造你日常的 system prompt 与工具描述
D7-9
快读
第 3 + 4 章 · 记忆与工具

抓"概念骨架",跳过实现细节

  • 第 3 章:记忆三层次 + 四种存储格式 + RAG 五步管道 + Agentic RAG
  • 第 4 章:五类工具 + 通用执行器 + MCP/Skill Hub + 执行安全体系
产出:各写 5 行"这章解决什么问题"笔记
D10
快读
第 5 章 · Coding Agent

只记核心论点

  • Coding Agent + 文件系统 = 通用 Agent 根基;七件套工具;元能力六方向扫一遍
产出:给项目补 CLAUDE.md 并对比前后行为
D11
快读
第 10 章 · 多 Agent

只读前半章就够

  • 信息增量判据 + 两维分类 + 三种通信机制 + Loop 工程"不能批准自己的完成"
产出:判断你手头任务到底该不该上多 Agent
D12
收束
复盘 + 后记

把散点串成体系

  • 重读第 1 章公式与第 2 章三结论;浏览第 6/7/8/9 章小结各 5 分钟
  • 把全书金句挑 10 句做成自己的卡片(见本页第七部分可直接抄)
产出:一张 A4"AI Agent 心智地图"——之后随时回来查漏
通关自测能回答:为什么工具结果缺失会让 Agent 陷入假答案与盲目重试?
通关自测能解释:KV Cache 为什么怕"系统提示词里带当前时间"?
通关自测能用一句话说清 MCP 与 A2A 各自解决什么问题。
适用:关注模型训练 / 想做 Agent 后训练的研究者或资深工程师。需要 Python + PyTorch 基础;Transformer 细节建议配合《图解大模型》第 2、8 章补课。
1
WEEK
打底 · 第 1 章 + 第 2 章(KV Cache 部分)

先懂 Agent 再谈训练 实验:2-2 ★★ 注意力可视化

  • 第 1 章:公式 + Harness(后训练要服务的对象)
  • 第 2 章:KV Cache 原理 + 上下文结构(RL 环境返回 token 与缓存的关系)
产出:能解释"训练与部署的上下文结构差异"
2
WEEK
第 7 章 · Agent 的评估(桥梁)

评估 = 后训练的前置工程 实验:7-3 ★★ / 7-14 ★★

  • Rubric / 验证器即未来 RLVR 的奖励函数——本章是第 8 章的地基
  • 跑 7-3 搭 Rubric 评估;选跑 7-14 接触具身仿真环境
产出:一套"可验证奖励"的评估集雏形
3
WEEK
第 8 章 · 模型后训练(本章主场)

四阶段、奖励设计、蒸馏、RL 工程 实验:8-11 ★★ / 8-16 ★★★ 可后置

  • 精读"底座/协议/策略"决策框架与四阶段全景
  • 跑 8-11(GeneralPoints)亲眼对比 RL 与 SFT 的泛化差异
  • 理解 RLVP、On-Policy Distillation 的动机与机制
产出:一张"何时 Mid-training / SFT / RL"决策卡 + 对照实验记录
4
WEEK
第 9 章 · 持续进化(数据回流)

生产轨迹 → 训练数据的闭环 实验:9-8 ★★★ 可选

  • 三类学习信号、四层更新载体、双循环:理解"问题案例如何变成后训练数据"
  • 读后记,结合"评估 → 仿真 → RL"主线收束全书
产出:一个"失败轨迹 → 训练数据"的完整方案草图
通关自测能画出预训练 → Mid-training → SFT → RL 的信号流与各自代价。
通关自测能解释"为什么 p@k 近零时直接上 RL 是烧预算"。
通关自测能说清"数据与环境比算法重要"在本书中的三处证据。
PART 06 · 实验里程碑

100+ 个实验怎么选?先做这 14 个旗舰

全书实验按 (复现与体验)/★★(深度实现)/★★★(挑战前沿)分级,均配套代码仓库。下面是按学习价值精选的"旗舰清单"——覆盖认识论、上下文、检索、工具、异步、评估、训练与协作八大主题,做完它们你就拥有了贯穿全书的动手经验。

1-1 ★★上下文消融实验——认识 Agent 的第一课:亲眼验证"缺工具定义 → 假答案、缺工具结果 → 盲目重试"。
2-1 ★本地小模型工具调用——0.6B 模型也能可靠调工具,直观看到思考→文本→tool_calls 的输出顺序与缓存提速。
2-3 ★★五种错误上下文管理模式——把"动态系统提示词/滑动窗口/文本格式化"的翻车现场各看一遍,胜过读十遍原理。
2-10 ★★★上下文压缩策略对比——无压缩 vs 非任务感知 vs 上下文感知(省 75%+ token),生产级上下文管理必修。
3-5 ★★从零实现 BM25——分词、倒排索引、TF-IDF 全流程手写,检索基本功的"肌肉记忆"课。
3-8 ★★Agentic vs Non-Agentic RAG——中文司法问答消融,体会"解决问题"与"回答问题"的本质差别。
4-1 ★★★主动工具发现——Qwen3-4B + 120 个工具:MCP-Zero 思想让小模型在上百工具场景保持可用。
5-1 ★★★跨厂商轨迹接管——中立格式让轨迹可移植(直传/剥离/中立三组对照),理解"思考凭证"问题。
6-1 ★★★事件驱动的邮件处理 Agent——异步与事件循环全套原语落地,走出"回合制"的第一步。
7-3 ★★Rubric 用户记忆评估——把单一 LLM-as-a-Judge 升级为多维 Rubric + 一票否决,评估方法论入门。
7-13 ★★★AndroidWorld 评估与改进——完整的"观察→假设→实验→验证"三轮循环,Agent 工程的科学方法全景。
8-11 ★★GeneralPoints:RL vs SFT——同一任务同预算,RL +17.6% / SFT −9.9%,"记忆与泛化"最直观的对照。
9-1 ★★客服轨迹验证器——"单一总分" vs "逐维度结论+证据+置信度",理解持续进化的信号从哪来。
10-2 ★★书籍翻译 Agent——管理者模式四角色 + 上下文隔离,多 Agent 协作的样板工程。
完整实验分布: 第1章 4 · 第2章 10 · 第3章 12 · 第4章 5 · 第5章 16 · 第6章 13 · 第7章 14 · 第8章 19 · 第9章 9 · 第10章 6 (约 108 个,编号 + 星级均以原书为准)。建议策略:每个 ★★ 都值得做,★★★ 按兴趣选 2–3 个深入;实验仓库多基于 MCP 服务器与免费/开放 API,成本可控。
PART 07 · 书中金句

14 句值得抄下来的话

全部逐字摘录自原书(含作者转述),是每章论点最凝练的表达——建议截图收藏,作为读完后的"记忆锚点"。
"上下文决定了 Agent 能看到什么,而 Agent 只能基于它看到的信息做决策。"
第 1 章 · AI Agent 入门
"行业正在从'能做事'向'可靠地做事'转变,Harness 工程因此成为 Agent 系统的核心竞争力。"
第 1 章 · Harness 工程
"一个中等能力的模型配上精心组织的上下文,往往能胜过一个顶级模型在信息匮乏下的盲目摸索。"
第 2 章 · 上下文工程
"上下文窗口是一台只有一半的检索引擎。"
第 2 章 · Agent 状态栏
"把知识库当成代码库,把每次知识变更当成一个 Pull Request……生产环境不应让任何一个模型绕过审核,直接改主分支或线上向量库。"
第 3 章 · 知识如何更新
"模型感知到的世界与工具操作的世界之间,不能存在系统性的偏差。"
第 4 章 · 参数传递的保真性
"思考上,形式化代码让思考高度严谨……表达上,一段能跑通的代码本身就是逻辑自洽的证明。"
第 5 章 · Coding Agent 与通用 Agent
"回合制是训练留下的假设,不是环境的性质。"
第 6 章 · 交互:观察与动作空间的扩展
"当一个度量指标变成优化目标时,它就不再是好的度量指标。"(古德哈特定律)
第 7 章 · 自动化评估方法
"数据里的每一处噪声,SFT 都可能忠实地写进参数——与其堆十万条脏数据,不如精修一万条干净数据。"
第 8 章 · 模型后训练
"模型会把观察到的行为当作应然的行为。"
第 9 章 · 从轨迹中获得学习信号
"真正的保证必须来自被修改者无法触及的那一层。"
第 9 章 · 持续进化的安全边界
"在验证之前,'完成'只是模型的一句宣称,不是证明。"
第 10 章 · Loop 工程
"你可以外包你的思考,但不能外包你的理解。"
第 10 章 · 多 Agent 的失败模式(引 Karpathy)